# run_001 v2 交付报告 — 真·对嘴数字人

> 日期: 2026-08-04 | 状态: COMPLETED

## 本次升级

v1 为 2.5D 静态母图运镜；v2 将数字人母片替换为 **LTX-2.3 22B 音频驱动对嘴数字人**（单图+音频→唇形同步视频）。

## 数字人技术栈

| 组件 | 值 |
|---|---|
| 生成模型 | LTX-2.3 22B distilled fp8_scaled (17GB, GPU 冷加载) |
| 音频驱动 | LTXVAudioVAEEncode + MelBandRoFormer 人声分离 |
| 条件 | LTXVConditioning + 人物母图 (FLUX 生成) + 语音条件 |
| 分辨率 | 480x832 基础 → 1.5x 放大 → 736x1248 → 合成缩放 |
| 帧率 | 30fps, 161帧/5.37s/段 |
| 分段 | 11 段双实例并行 (A偶数/GPU0, B奇数/GPU1) |
| 拼接 | ffmpeg concat → avatar_talking.mp4 (56.1s) |

## 踩坑记录 (7项, 已固化)

1. SimpleMath+ 在 py3.14 崩溃 (ast.Num 移除) → 删除, 字面量代替
2. LTXVConditioning.frame_rate 需 FLOAT → 字面量 30.0
3. 校验错误级联剔除下游节点 → 必须看 submit 的 node_errors
4. extra_state_dict 字符串 "None" 当文件路径 → 删除该键
5. sage_attention="auto" → import triton (Windows 无) → "disabled"
6. LTX2SamplingPreviewOverride 预览线程崩 (last_node_id None) → 删除
7. **ComfyUI 服务器必须不带 `-s` 启动** (user site 含 comfy_kitchen 依赖, 缺则量化布局未注册 → fp8/mxfp8 模型加载失败)

## 最终交付

- 成品: `runs/run_001/07_final/final.mp4` (52.0s, 1080x1920@30fps, 10.3MB)
- 无字幕: `runs/run_001/07_final/final_nosub.mp4`
- 封面: `runs/run_001/07_final/cover.jpg`
- 数字人母片: `runs/run_001/03_avatar/avatar_talking.mp4`
- 字幕: `runs/run_001/04_graphics/subtitles.ass` (黑底条样式, 卡片文字已上移避让)

## 质检

- 5 帧 Kimi 视觉审核: 全通过 (口型/身份/字幕/错字/黑屏均合格)
- 黑帧/爆音/静音: 通过
- 音画同步: 结构保证 (视频分段对齐母轨, 音频用原始母轨)
